精华简报:参数的消亡——GLM 5.3与后训练扩展定律
TL;DR
智谱AI CEO唐杰明确提出:参数数量不再是衡量模型能力的核心标尺。在“推理拐点”之后,模型进步的主要来源正在从“参数量×预训练数据”转向“后训练数据质量、推理算力分配、长时程RL环境与运行条件”。GLM-5.3 在几乎相同的基座模型上,仅通过约一个月的额外强化学习就实现大幅跃升,成为“后训练扩展定律”的实证。与此同时,开源模型快速逼近顶级闭源,智能体框架(harness)正取代模型本身成为新的竞争与成本中心。
核心观点与技术/商业洞察
1. 参数中心论终结:从“参数数量”到“五维扩展”
唐杰在X上表示,“参数数量只有在与其他三个因素一起考虑时才有意义——你拥有多少数据、你打算将算力花在哪里、以及由谁来运行模型、在什么条件下运行”。
他进一步提出5个扩展旋钮(5 knobs of scaling),其中包括:
- 数据规模与质量
- 算力分配策略(预训练 vs. 后训练 vs. 推理)
- 模型架构(如MoE稀疏性,采用新的 XA-YB记号 描述)
- 后训练/RL环境
- 部署与运行条件
关键判断:高级技能(如发现软件漏洞)不是检索/记忆问题。这类能力需要模型在20+步推理中保持长因果链而不丢失上下文;一旦知识持有量越过某个阈值,能力不再取决于总参数数量,而取决于后训练如何塑造“有效深度”。
2. 推理拐点:Chinchilla定律为何失效
传统Chinchilla扩展定律假设存在一个固定的“tokens/参数”最优比例,但在**推理拐点(Inference Inflection)**世界中,这一假设被打破:
- 记忆(Memorization) 偏好更多参数。
- 推理(Reasoning) 偏好更多后训练数据和有效深度,而非参数数量。
引用Roberts等人的研究,最优token/参数比并非固定,而是在200-900 tokens/参数之间随任务变化。这意味着“更大的模型”不再是“更聪明模型”的同义词,后训练配方(post-training recipe)才是推理能力的真正杠杆。
3. GLM-5.3:后训练RL的实践验证
GLM-5.3 的跃升被认为完全来自长时程环境上的强化学习:
- 环境覆盖广泛的生产工作流,任务设计基于真实工程/研究实践。
- 部分任务相当于一位资深工程师数天的工作量。
- 在ML基础设施任务中,模型获得与工程师相同的环境:计算集群、存储系统、内部文档、代码库、实验结果,需要自主诊断瓶颈、实施优化、运行实验,并交付可衡量的端到端加速。
- 这种训练迫使模型对端到端工作负责,而非依赖用户分解问题、逐步监督。
这与“递归自我改进”叙事一致:随着智能体能力提升,后训练扩展的瓶颈从模型转移到环境。
4. 合成环境流水线:后训练的基础设施化
唐杰团队的核心工程创新在于端到端合成环境流水线:
- 一个有用的任务环境必须可执行、可验证、接近真实专业工作,且需要大量此类环境,而非少数手工构建。
- 研究智能体从真实工作中收集任务模式,转化为可运行的长时程环境,包含多步依赖和隐藏状态。
- 评判智能体先尝试每个任务,验证其确实可解。
- 验证器在不访问参考解的情况下合成,同时利用求解器轨迹发现并关闭奖励捷径。
- 通过 oracle、no-op、unsolved-state 三重检查的二元奖励,可直接用于训练。
这套流水线意味着:后训练数据的瓶颈从“人类标注”转向“合成环境+自动验证”,而RL奖励信号也可部分由合成流程生成。
5. 开源生态与模型压缩的动态
文章还回顾了同期重要的行业新闻:
- Ornith-1.5 发布:9B稠密、35B MoE、397B MoE三种变体,MIT许可,支持FP8/GGUF/MLX/NVFP4量化。宣称实现端到端自我改进(模型自己提任务、生成脚手架、做RL rollout),在Terminal-Bench 2.1(86.1)、SWE-Bench Verified(86)等基准上表现强劲。
- 压缩技术激进化:UnslothAI 的 Qwen3.8-27B GGUF 使用 Dynamic V3,同尺寸精度提升约10%;1-bit量化在8GB RAM上仍保留约77%的BF16精度。
- 开源模型逼近闭源:GLM-5.3在开源权重中排名 Terminal Bench #2、Legal Bench #3、Skills Bench #6;Agent Arena帕累托前沿上,Kimi K3、GLM 5.2、Grok 4.5等低成本模型定义了价值前沿。
- 年底前可能出现开源权重的Fable级模型(估计3-7T参数),而现有Qwen 3.8 Max、Kimi K3等2-3T模型在AA指数上仅落后2分——开源与闭源的差距正急剧缩小。
6. 智能体框架成为新的竞争层
除了模型本身,行业焦点正转向智能体框架/运行时(harness):
- DeepSeek Harness (DSH):刻意保持极简,内部为插件架构Cordis,一切皆插件,包括智能体循环本身。早期用户一周内贡献100+插件、400+ issues。定位是“开放智能体运行时”,而非产品化助手。
- TrueForge(TrueFoundry开源):MIT许可、可自托管、供应商中立。在14任务企业基准上,匹配Claude Managed Agents的同时token减少约30%;路由到GLM-5.2可降低成本约75%且保持准确性。
- 托管框架增强可观测性:ClaudeDevs加入自托管沙箱内存、域名控制、多智能体会话查看器(小地图、分组记录、每线程成本);OpenAI开源Codex harness作为嵌入产品的运行时。
- RL-through-the-harness:Microsoft Agent Lightning v1.0 通过端点代理将任意harness连接到RL,代表“框架即训练环境”的新范式。
行业启发与影响
-
参数竞赛正式终结:评估模型应从“参数量”转向“数据+算力+后训练+运行条件”的多维坐标系。未来模型卡可能需要披露更多后训练与推理配置,而非仅参数规模。
-
后训练成为新的护城河:GLM-5.3证明了“相同基座、一个月RL”可以产生显著能力跃升。高质量长时程环境、合成验证器、奖励工程将取代预训练数据规模,成为AI公司的核心技术壁垒。
-
合成环境是下一代数据工厂:人工标注与静态数据集正在让位于“可执行、可验证、可规模化合成”的任务环境。研究智能体+评判智能体的自动化流水线,可能让后训练数据以指数级速度增长。
-
开源模型将进入“超车”阶段:Ornith-1.5的自我改进、1-bit量化、开源权重在多个基准上的排名,都表明开源社区不再只是跟随者。年底前出现接近顶级闭源的开源模型是大概率事件。
-
价值从模型层迁移到框架层:会话/环境/内存/工具层成为差异化和成本优化的主战场。谁能提供更低token消耗、更高可控性的harness,谁就能在AI应用中获取更大份额。
-
RL与智能体框架融合:Agent Lightning等方案将harness变成RL环境,意味着智能体可以在真实工具链中持续自我改进。未来的模型不是“训练完再部署”,而是“在部署中持续训练”。